Evolução do PLN: De IA Fragmentada a Modelos de Fundação
Definições
- IA Fragmentada: Uma era definida por arquiteturas neurais discretas e especializadas, projetadas para tarefas individuais, como rotulagem de sequências ou classificação.
- Modelo de Fundação: Uma arquitetura de transformer unificada e monolítica que trata todos os problemas linguísticos como uma sequência gerativa de texto para texto $x \rightarrow y$.
Conceitos Fundamentais
- Consolidação Arquitetural: Historicamente, o PLN exigia pipelines personalizados (Bi-LSTMs para NER, CNNs para sentimentos). Os LLMs colapsam esses silos em um único backbone, onde os mesmos pesos são utilizados para todas as tarefas.
- A Interface Unificada: Os LLMs substituem "cabeças de saída" especializadas (por exemplo, Softmax de 3 classes) por uma interface de linguagem natural. Entradas e saídas são sempre strings, permitindo que o modelo interprete a intenção em vez de o formato.
- Transferência de Conhecimento: Os modelos tradicionais eram "tabula rasa" para cada tarefa. Os LLMs priorizam a Generalização em Primeiro Lugar, em que tarefas específicas são meras aplicações de uma representação interna robusta e pré-existente da linguagem.
Contexto Histórico
- Pré-2018: O isolamento de tarefas exigia o treinamento de modelos distintos com diferentes funções de perda $\mathcal{L}_{task}$.
- Era Moderna: O paradigma "Texto para Texto" permite que um único modelo (por exemplo, Llama-3) alterne entre tarefas por meio de prompts zero-shot ou few-shot.
Comparação de Implementação em Python
